Previous

2.2 字符串开头或结尾匹配

问题

你需要通过指定的文本模式去检查字符串的开头或者结尾,比如文件名后缀,URL Scheme 等等。

解决方案

检查字符串开头或结尾的一个简单方法是使用 str.startswith() 或者是 str.endswith() 方法。比如:


In [1]:
filename = "spam.txt"
filename.endswith(".txt")


Out[1]:
True

In [2]:
filename.startswith("file:")


Out[2]:
False

In [3]:
url = "http://www.python.org"
url.startswith("http:")


Out[3]:
True

如果你想检查多种匹配可能,只需要将所有的匹配项放入到一个元组中去, 然后传给 startswith() 或者 endswith() 方法:


In [4]:
import os
filenames = os.listdir(".")
filenames


Out[4]:
['.ipynb_checkpoints',
 '02 strings and text.ipynb',
 '02.01 split string on multiple delimiters.ipynb',
 '02.02 match text at start end.ipynb',
 'Untitled.ipynb']

In [5]:
filenames = ["Makefile", "foo.c", "bar.py", "spam.c", "spam.h" ]
filenames


Out[5]:
['Makefile', 'foo.c', 'bar.py', 'spam.c', 'spam.h']

In [6]:
[name for name in filenames if name.endswith((".c", ".h"))]


Out[6]:
['foo.c', 'spam.c', 'spam.h']

In [7]:
any(name.endswith(".py") for name in filenames)


Out[7]:
True

下面是另一个例子:


In [8]:
from urllib.request import urlopen

def read_data(name):
    if name.startswith(("http:", "https:", "ftp:")):
        return urlopen(name).read()
    else:
        with open(name) as f:
            return f.read()

奇怪的是,这个方法中必须要输入一个元组作为参数。 如果你恰巧有一个 list 或者 set 类型的选择项, 要确保传递参数前先调用 tuple() 将其转换为元组类型。比如:


In [9]:
choices = ["http:", "ftp:"]
url = "http://www.python.org"
url.startswith(choices)


---------------------------------------------------------------------------
TypeError                                 Traceback (most recent call last)
<ipython-input-9-9ac2bd6fa1b0> in <module>()
      1 choices = ["http:", "ftp:"]
      2 url = "http://www.python.org"
----> 3 url.startswith(choices)

TypeError: startswith first arg must be str or a tuple of str, not list

In [10]:
url.startswith(tuple(choices))


Out[10]:
True

讨论

startswith()endswith() 方法提供了一个非常方便的方式去做字符串开头和结尾的检查。 类似的操作也可以使用切片来实现,但是代码看起来没有那么优雅。比如:


In [11]:
filename = "spam.txt"
filename[-4:] == ".txt"


Out[11]:
True

In [12]:
url = "http://www.python.org"
url[:5] == "http:" or url[:6] == "https:" or url[:4] == "ftp:"


Out[12]:
True

你可以能还想使用正则表达式去实现,比如:


In [13]:
import re
url = "http://www.python.org"
re.match("http:|https:|ftp:", url)


Out[13]:
<_sre.SRE_Match object; span=(0, 5), match='http:'>

这种方式也行得通,但是对于简单的匹配实在是有点小材大用了,本节中的方法更加简单并且运行会更快些。

最后提一下,当和其他操作比如普通数据聚合相结合的时候 startswith()endswith() 方法是很不错的。 比如,下面这个语句检查某个文件夹中是否存在指定的文件类型:

if any(name.endswith(('.c', '.h')) for name in listdir(dirname)):
...

Next